前兩天分別介紹了 VoCare 的概念與需求,今天想整理一下整體系統架構。
隨著功能越來越多,像是 AI 對話、語音、相機、提醒、跌倒偵測、個人化記憶等,如果沒有先分工好,很容易讓整個專案變得難以維護。
目前我大致把 VoCare 分成幾個部分:
簡化後的流程大概是:
使用者
↓
前端 / 手機裝置
↓
後端 API
↓
AI、語音、影像、提醒等模組
↓
決策與安全規則
↓
回應使用者 / 通知家屬
前端與手機
VoCare 主要以語音互動為主,但還是會保留畫面操作。
手機本身也不只是顯示介面,還可以利用相機與麥克風取得資訊,因此同時也是 VoCare 很重要的感測來源。
後端負責串接功能
後端可以看成整個系統的中樞。
例如使用者說:
幫我提醒晚上八點吃藥。
後端需要接收資料,判斷這是一個提醒需求,再把資料交給對應模組處理。
同樣地,如果影像模組偵測到疑似跌倒,也會先把結果交給後端,再進入後續判斷流程。
AI 不會直接決定所有事情
VoCare 不會把所有事情都交給同一個 AI。
不同功能會由不同模組處理,例如:
語言模型負責對話與語意理解
影像模組負責姿勢與跌倒判斷
語音模組負責語音輸入與輸出
而且 AI 的分析結果也不會直接等於系統的動作。
一般模式和長者模式
VoCare 雖然分成一般模式與長者模式,但不會做成兩套完全獨立的系統。
兩者會共用:
AI 對話
語音
個人化記憶
使用者資料
行程與提醒
相機與麥克風
差別主要在於啟用的功能與判斷規則不同。
一般模式比較偏向疲勞、久坐、工作與生活管理;長者模式則更重視跌倒、用藥、平安確認與異常警示。
Day 3 小結
目前 VoCare 的設計方向,不是做一個「什麼都處理的 AI」,而是讓不同模組各自負責自己的工作,再透過後端與決策流程整合起來。